|
16.08.2026
08:00 Uhr
|
Hörbücher und Podcasts sind mehr als vorgelesener Text. KI-Modelle können automatisiert Stil und Stimmungen analysieren und so neue Suchfunktionen eröffnen.

Oft sucht man länger nach dem richtigen Hörbuch, dem fesselnden Podcast oder dem passenden Spielfilm für den Abend, als man am Ende überhaupt zuhört oder hinsieht. Wer Audioinhalte oder Videos passend zur persönlichen Stimmung sucht, etwa „etwas Ruhiges zum Einschlafen“ oder „etwas Spannendes für die Bahnfahrt“, braucht Empfehlungen oder muss raten. Ein Kategoriebaum und eine Volltextsuche für Titel, Kurzbeschreibung und einige Keywords – mehr bieten die meisten Apps nicht.
Im Forschungsprojekt „MANGAN – intelligente Metadatenextraktion und intuitive Suche bei gesprochenen Audioinhalten“ hat ein Team am Rechenzentrum der Universität Leipzig gemeinsam mit den Unternehmen Buchfunk und ifabrik Verfahren zur automatisierten Metadatenextraktion aus Audiodateien mit gesprochenen Texten entwickelt.
Dabei verfolgten die Forscher zwei Ziele: Es ging ihnen darum, gesprochene Audioinhalte intuitiv auffindbar zu machen und zugleich die dafür erforderlichen Metadaten automatisiert und damit wirtschaftlich skalierbar bereitzustellen. Das Ergebnis ist eine facettenreiche Suche, die nicht nur Titel und Genre kennt, sondern auch Tonfall, Tempo, Stimmprofil, Stimmung, Themen und Anspruch berücksichtigt. Andere Gruppen arbeiten daran, auch die Suchfunktionen für Videobestände schrittweise zu erweitern.